Neural Machine Translation by Jointly Learning to Align and Translate (2015 论文)
概述
Bahdanau、Cho、Bengio 在 ICLR 2015 发表的论文,首次提出注意力机制解决 seq2seq 固定长度瓶颈,使机器翻译具备可解释的对齐矩阵,是 Transformer 和现代 LLM 的直接前身。
关键内容
核心贡献
- 注意力机制的提出:翻译每个目标词时,动态对源句子所有位置加权求和,生成该时刻专属的上下文向量 $c_t$,彻底解决固定长度瓶颈
- 对齐函数设计:$e_{it} = v^\top \tanh(W_a s_{t-1} + U_a h_i)$,通过小型前馈网络学习源位置与当前解码的相关性
- 可解释性突破:注意力权重 $\alpha$ 构成对齐矩阵,使机器翻译首次可视化,英法翻译呈现对角线模式
- 实验验证:在英法翻译任务上 BLEU 分数显著提升,且长句翻译质量不再随长度急剧下降
实验结果
历史影响
该论文是注意力机制的开山之作,直接启发了 Luong (2015) 的点积注意力、Vaswani (2017) 的 Self-Attention 和 Transformer 架构。现代所有 LLM(GPT、Claude 等)的核心机制均可追溯至此。
来源
- raw/articles/ai-papers/machine-learning/12_attention_2015.md — 完整论文解读与代码实现
相关
- Yoshua Bengio — author(论文第三作者,深度学习先驱)
- 注意力机制(Attention Mechanism) — caused(本论文首次提出注意力机制)
- Bahdanau注意力 — caused(本论文提出的加性注意力具体实现)
- 编码器-解码器架构(Seq2Seq) — extends(在 Cho 等人 seq2seq 基础上引入注意力)